Mise à jour d'un état
Toutes les méthodes que nous avons vues lors de la formation d'initiation à l'apprentissage par renforcement sont basées sur des mises à jour des fonctions les valeurs des états à chaque itération de l'agent dans l'environnement. Prenons la notation suivante pour décrire une mise à jour individuelle d'un état : $s \mapsto u$ : à un état $s$ de l'environnement, on associe une mise à jour de la cible $u$.
Par exemple:
Principe de généralisation et d'apprentissage supervisé
Chaque mise à jour peut-être interprétée comme un exemple de la relation désirée sur la fonction des valeurs d'un état donné entre une entrée $s$ (l'état) et une sortie $u$ (la cible de cet état). Les exemples que nous avons traités jusqu'à présent, dans la formation d'initiation à l'apprentissage par renforcement, réalisait ces mises à jour de manière triviale : une table contenait toutes les valeurs de chaque état de l'environnement et à chaque itération un état spécifique se mettait à jour dans la table, alors que les valeurs des autres états ne changeaient pas. Ce qui change maintenant, c'est que nous allons utiliser des méthodes plus complexes et sophistiquées pour réaliser ces mises à jour car elles vont être généralisées à l'ensemble des états de l'environnement. Cela signifie que si la valeur d'un état est modifiée, alors cela aura un impact sur la valeur de l'ensemble des autres états.
Les méthodes de Machine Learning qui fonctionnent sur ce principe de relation entre l'entrée et la sortie sont appelées des méthodes d'apprentissage supervisées. En particulier, lorsque ces méthodes fournissent en sortie un nombre, on parle alors d'approximation de fonction. Les méthodes d'approximation de fonctions ont besoin d'avoir des exemples de relations entre les entrées et les sorties afin de trouver des fonctions pour approximer ces relations. On utilise ces méthodes pour la prédiction des fonctions des valeurs des états en leur fournissant à chaque itération un exemple de relation entre l'état $s$ est la cible $u$ : $s \mapsto u$.
Méthodes d'approximation de fonctions dans le cadre de l'apprentissage par renforcement
Il existe de nombreuses méthodes d'approximation de fonction de type supervisées, tels que les réseaux de neurones artificiels, les arbres de décision (ex: random forest) ou encore des algorithmes de régression multivariés. Cependant, toutes ces méthodes ne sont pas forcément adaptées de manière équivalente dans le domaine de l'apprentissage par renforcement.
En effet, le plus sophistiqué des réseaux de neurones artificiels ou encore la méthode statistique la plus puissante assume que les données d'entraînement sont entièrement disponibles à un instant $t$ et travaillent sur des lots de ces données. Or, ce n'est pas le cas dans le domaine de l'apprentissage par renforcement à cause de l'interaction de l'agent et son environnement au cours du temps. On a donc besoin de méthodes qui apprennent de manière efficace à partir de données récoltées de manière incrémentale, au fur et à mesure que l'agent évolue dans son environnement. De plus, les valeurs que les fonctions tentent d'approximer ne sont pas constantes dans le temps (elles sont non stationnaires). Il nous faut donc des méthodes capables de prendre en compte cette non stationnarité.